视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数
视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。
来自主题: AI技术研报
9337 点击 2026-07-23 10:39